1
Introdução à Visão Computacional e ao Processamento Digital de Imagens
PolyU COMP5511Lecture 8
00:00

Introdução à Visão Computacional e ao Processamento Digital de Imagens

Visão Computacional é o campo da inteligência artificial que permite aos computadores extrair informações significativas de imagens e vídeos digitais, tentando efetivamente superar a lacuna semântica entre os dados brutos de pixels e o entendimento no nível humano. Processamento Digital de Imagens serve como a camada fundamental para a Visão Computacional, focando na manipulação e aprimoramento de sinais de imagem por meio de transformações pixel a pixel para preparar os dados para tarefas interpretativas de nível mais alto.

Princípios Fundamentais

  • Representação de Dados: No nível da máquina, uma imagem é um tensor numérico, em vez de uma imagem holística. Imagens em escala de cinza são matrizes 2D de valores de intensidade, enquanto imagens coloridas são tensores 3D que representam os canais Vermelho, Verde e Azul (RGB) com dimensões $H \times W \times 3$.
  • Transformação vs. Interpretação: O Processamento Digital de Imagens está principalmente preocupado com operações imagem-para-imagem, como redução de ruído, realce de nitidez ou equalização de histograma. A Visão Computacional foca em operações imagem-para-conhecimento, como classificação de objetos, localização e segmentação.
  • O Paradigma da Computação Gráfica Inversa: A Visão Computacional pode ser vista como o inverso da Computação Gráfica. Enquanto a computação gráfica busca gerar um mundo visual a partir de modelos matemáticos, a visão busca recuperar estruturas 3D e rótulos semânticos a partir de projeções 2D.
O Desafio Central
O principal desafio neste campo é a Lacuna Semântica, que é a desconexão entre os valores de pixel de baixo nível processados pelas máquinas e os conceitos de alto nível percebidos pelos humanos.
Implementação em Python
Pergunta 1
Qual processo é categorizado como uma operação imagem-para-conhecimento?
Processamento Digital de Imagens
Visão Computacional
Computação Gráfica
Equalização de Histograma
Pergunta 2
No nível da máquina, qual é a estrutura de dados de uma imagem colorida padrão?
Matriz 2D
Array 1D
Tensor 3D / Canais RGB
Lista Encadeada
Estudo de Caso: Sistema de Diagnóstico Médico
Leia o cenário abaixo e responda às perguntas.
Um hospital está desenvolvendo um novo sistema automatizado de diagnóstico médico projetado para analisar exames de raio-X em busca de possíveis fraturas ósseas. O sistema processa os dados brutos do sensor da máquina de raio-X e gera um relatório diagnóstico para o radiologista.
Q
1. Se o sistema aplica realce de contraste para tornar as estruturas ósseas mais claras, isso é Processamento Digital de Imagens (PDI) ou Visão Computacional (VC)?
Resposta:
Processamento Digital de Imagens. O realce de contraste é uma transformação imagem-para-imagem que melhora a qualidade visual do sinal sem extrair significado semântico.
Q
2. Se o sistema sinaliza automaticamente uma área específica como uma possível fratura, que tarefa ele está realizando?
Resposta:
Visão Computacional / Detecção de Objetos. O sistema está interpretando o conteúdo da imagem para extrair conhecimento de alto nível (localizar uma fratura).
Q
3. Por que a redução de ruído é necessária antes de executar um algoritmo de detecção?
Resposta:
Para melhorar a qualidade do sinal e reduzir falsos positivos na fase de interpretação semântica. O ruído pode ser mal interpretado pelos algoritmos de VC como características ou bordas reais.